融合算子：Square-Sigmoid-Affine-Gate（一次核内完成仿射、平方与 Sigmoid 门控，返回 y = x * σ(α * z^2 + β)，其中 z = x*scale + bias）。平方增强幅值差异并通过 Sigmoid 控制门控强度。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`
- 计算流程：`z = x*scale + bias`，`v = z*z`，`g = sigmoid(alpha*v + beta)`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：PyTorch 参考 `Model`；统一的 `get_inputs()`/`get_init_inputs()`
- `cudacode.py`：单核融合（仿射+平方+sigmoid+乘法）；`-O3 --use_fast_math`
- `run_code.py`：迭代 100 次；`rtol=1e-03, atol=1e-06` 精度；打印加速比

CUDA 实现要点
- 并行布局：`grid = B`；块内沿 D 合并访存
- 对齐向量化：16 字节对齐且 `D%4==0` 时走 `float4`；否则标量回退
- 指令优化：仿射用 `fmaf`；sigmoid 用 `expf`；循环 `#pragma unroll 4`
- 溢出注意：`z^2` 对大幅值会放大，sigmoid 可缓和，但仍需避免中间溢出；使用 `float` 常规范围下问题不大
- 线程配置：推荐 `block=1024`，按设备与规模微调

评估与目标
- 精度：对齐 `rtol=1e-03, atol=1e-06`
- 性能：≥1.0x 加速；对齐触发向量化时更佳

加分项（可选）
- 尾元素处理与分支收敛优化
- 每线程批量步长以提高吞吐与占用

